问题 #1
以下哪种方法在大数据集上扩展性较差?
答案: C
本题是All AI Fundamentals Questions认证中聚类算法选型模块的核心考题,考察不同聚类算法在大数据集下的扩展性表现。扩展性指算法随样本规模增长时,计算效率、资源占用的可控性,是工业场景选择聚类算法的核心指标。层级式聚类受自身算法逻辑限制,样本量增长时计算和存储成本上升幅度远高于其他两类算法,是大数据集下扩展性最差的方法,因此正确答案为C。
各选项分析:
A. 选项指模糊聚类,典型代表为模糊C均值算法,其时间复杂度与样本量呈近似线性关系,支持分布式改造,可适配百万级以上样本的大数据场景,扩展性良好,不符合题意。
B. 基于密度的方法典型代表为DBSCAN,现有优化版本可将时间复杂度降至O(n log n),且目前已有成熟的分布式实现方案,可适配大数据场景,扩展性优于层级式聚类,不符合题意。
C. 层级式聚类分为自底向上的凝聚式和自顶向下的分裂式两类,两类算法都需要迭代计算所有样本对的距离或相似度,最低时间复杂度为O(n²),且需要存储完整的层次化聚类树结构,样本量增长时计算和存储成本呈指数级上升,无通用低复杂度优化方案,在大数据集上扩展性最差,符合题意。
关键知识点:
1. 聚类算法扩展性评估是AI基础认证聚类模块的核心考点,指算法随样本规模增长时计算效率、资源占用的变化情况,是工业场景算法选型的核心依据。
2. 层级聚类的核心逻辑决定其时间复杂度不低于O(n²),无有效通用优化方案,仅适合小数据集场景使用。
3. 主流聚类算法扩展性对比要求考生掌握,模糊聚类、密度聚类均可通过分布式改造适配大规模大数据场景,层级聚类无法适配。
参考资料:
Azure机器学习算法参考指南, AWS机器学习开发者指南-聚类算法介绍, https://docs.aws.amazon.com/zh_cn/machine-learning/latest/dg/clustering.html